
База данных научных статей
База данных научных статей
Ресурсы
- Обсуждение архитектуры: https://chatgpt.com/share/698882eb-6a0c-8003-bee6-a37189d74ff5
В рамках центра AI4Science мы строим мультиагентные системы для автономных исследований и ускорения научного поиска. У нас находятся в разработке системы написания литературного обзора по области исследований, системы поиска релевантных статей, агент автономного написания научных статей по теме, агент - писатель метаобзора научной области.
В ряде приложений мы сталкиваемся с проблемой доступа к научным статьям.
Ключевые препятствия:
- Системы противодействия скачиванию - cloudflare и другие защиты. Некоторые обходятся через selenium, некоторые нет.
- Региональные блокировки - для каких-то ссылок необходимо поднимать VPN.
- Paywall - некоторые статьи не находятся в открытом доступе.
Пользовательские сценарии
Здесь мы описываем типичные сценарии нашего использования, а не внешнего.
1. Поиск литературы для обзора. ИИ‑агент должен находить публикации по ключевым словам, DOI, авторам или областям, фильтровать по дате и типу публикации и быстро извлекать аннотацию и основные выводы.
2. Анализ цитирования и связей. Агенту нужен доступ к сетям цитирования и списку литературы каждой статьи, чтобы строить граф знаний и выявлять ключевые работы.
3. Доступ к полному тексту. Для глубокого анализа требуется полный текст и возможность обработки PDF, LaTeX или HTML.
4. Регулярное обновление базы. Новые статьи должны автоматически появляться в хранилище в соответствии с периодичностью источника (ежедневно для arXiv, PMC и др.).
Источники
| Источник | Описание | Примерный Объём | Форматы/Доступ | Частота обновления | Дополнительно |
|---|---|---|---|---|---|
| scihub | База данных научных статей. Не обновляется с конца 2022 года, но содержит большое количество статей, вышедших до этого. Крайне полезный источник. | 88 млн статей, ~100 ТБ | документ + мета | Не обновляется | https://sci-hub.se/scimag/ здесь список на торрент со всем архивом |
| OpenAlex snapshot | Поисковик научных статей. Важно, что в его снэпшоте содержится полный обновляемый каталог сервиса unpaywall | 1.6 ТБ | Ежемесячно | https://docs.openalex.org/download-all-data/snapshot-data-format https://docs.openalex.org/download-all-data/openalex-snapshot | |
| CrossRef | Предоставляет метаданные (Dublin Core, JSON) по DOI; поддерживает открытые API. | Последний снэпшот (март 2025) 197 Гб 2024 год - 212 ГБ 2023 год - 185 Гб 2022 год - 167 Гб 2021 год - 102 Гб | JSON | Ежегодно выкладываются снэпшоты Но апдейты по новым doi надо делать как минимум раз в неделю. Это и есть основной источник мета информации о новых статьях. | https://www.crossref.org/learning/public-data-file/ |
| OpenCitations | Крупная открытая база цитирований doi2doi | 2.2 миллиарда цитирований ~ 1 Тб | Большие разреженные графы в простейшем случае есть csv, но есть и другие форматы Most recent OpenCitations Index data dump - July 2025 Released on 2025-07-10, this dataset adds the citation data contained in the Crossref dump dated March 2025 Key Statistics 2.2 Billion+ Citations (2,216,426,689) Download Files Type and format Archive Size Citation data (CSV) 242 GB (38.8 GB zipped) Citation data (N-Triple) 2.1 TB (87.4 GB zipped) Citation data (Scholix) 2.1 TB (45 GB zipped) Provenance data (CSV) 454 GB (20 GB zipped) Provenance data (N-Triple) 3.4 TB (105 GB zipped) | Два раза в год выкладываются снэпшоты Но апдейты по новым doi надо делать как минимум раз в неделю. Это и есть основной источник о том, кто кого цитировал | https://download.opencitations.net |
| arxiv | Источник препринтов и исходных текстов большого количества научных статей в области Math и Computer Science | Терабайты данных Миллионы статей Десятки тысяч новых статей каждый месяц | Принимаются LaTeX и PDF; метаданные доступны через OAI‑PMH и API. RSS-ленты отправляются ежедневно | Ежедневно (Допустимо еженедельно) | Возможно сильное пересечение с HAL и dblp |
| PubMed Central | Открытый архив биомедицинских статей NCBI. | 11 млн статей | Хранит полные тексты в формате XML/HTML; поиск осуществляется через Entrez; доступны PDF. | (?) Ежедневно (Допустимо еженедельно) | https://pmc.ncbi.nlm.nih.gov/tools/textmining/ |
| HAL | Французский национальный репозиторий. По состоянию на 2023 г. содержит миллионы документов, обеспечивая идентификаторы и версионность; более 1 млн документов доступны в открытом доступе | Более 1 млн статей | Поддерживает TEI/XML, PDF и другие форматы; предоставляет богатые метаданные через OAI‑PMH. | Допустимо ежемесячно | Возможно сильное пересечение с dblp и arxivами |
| dblp | Немецкий аналог HAL | Десятки тысяч статей ежемесячно. Всего около 8 миллионов статей | Допустимо ежемесячно | Возможно сильное пересечение с HAL и arxivами | |
| biorxiv | Биомедицинский репозиторий препринтов. В 2017 г. было принято 10 722 работ; в 2018 г. — около 20 000, в 2019 г. — 31 000 (2600–3000/мес.), в 2020–2022 гг. публикуется 36–40 000 предпечатей ежегодно | Принимаются PDF, DOCX и LaTeX; доступны файлы PDF и разметка; по желанию авторы публикуют ревизии. | Ежедневно (Допустимо еженедельно) | ||
| Chemrxiv | аналогично | Ежедневно (Допустимо еженедельно) | |||
| PsyArXiv | аналогично | Ежедневно (Допустимо еженедельно) | |||
| Другие | Нас очень интересуют другие источники научных статей за пейволом - все большие паблишеры (Elsevier, Wiley and American Chemical Society, Springer…) Мы знаем, что Ленинка как-то научилась предоставлять доступ к таким работам Ниже алгоритм, как это можно получить в индивидуальном порядке - если бы можно было организовать выкачку - это было бы супер: Российская Государственная Библиотека организовала доступ к международным базам данных и зарубежным статьям 🔥 Там есть все, что мы любим: Elsevier, ACS, Wiley, Springer и др. Для получения доступа нужно: 1. Зарегистрироваться на сайте РГБ, подвязать госуслуги и получить номер читательского билета; 2. Зарегистрироваться на портале MyLOFT, зайти через данные, полученные из РГБ и подождать 1-2 дня для одобрения. 3. Установить расширение MyLOFT в браузер (в приложении инструкция от РГБ). Сюда же можно отнести источники научных статей из libgen, anna’s archive | # |
Ссылка на инструкцию по сервису MyLoft
Требования к базе данных
Мы не большие специалисты по данным, поэтому какие-то комментарии/запросы могут быть неточными.
- Файлы: необходимо хранить оригинальные файлы статей в формате PDF; для статей, доступных в исходных форматах, сохранять также LaTeX, TeX, DOCX и HTML. Желательно сохранять текстовый слой (plain TXT) для быстрого поиска. Некоторые источники (PMC, HAL) предоставляют XML/TEI - их следует сохранять для точного разбора структуры.
- Парсинг метаданных и текста: Для связи со списком литературы используется Crossref и Semantic Scholar. Совсем в идеальном мире бесконечного компьюта было бы хорошо прогнать все статьи через docling для получения добротного markdown файла с таблицами. Однако, учитывая объём базы, допускаем, что это задача близка к невозможной. При этом, анализ графа цитирований был бы полезен для определения, допустим, десятка тысяч самых значимых статей в области по простейшему PageRank или другому способу определения важности и дальнейшего парсинга самых важных статей.
- Идентификаторы: каждая запись должна иметь DOI, арXiv ID, PMC ID, PMID, HAL ID и др. При отсутствии DOI следует генерировать внутренний UUID. Использовать ORCID для авторов и ROR для организаций.
- Доступ: хранилище должно позволять искать статьи по различным полям (DOI, title, author, год, ключевые слова, предметная область), выполнять полнотекстовый поиск и возвращать результаты в машиночитаемом виде (JSON/YAML).
- Версионность: поддерживать несколько версий одной статьи (например, препринт на архиве и опубликованную версию). Необходимо отмечать дату загрузки и дату последнего обновления. Для этого они могут иметь одинаковый doi, но разные даты и разые UUID
- Доступ API: предоставить REST/FastAPI для ИИ‑агента и внутренних сервисов. Поддерживать аутентификацию, ограничение скорости и журналирование запросов. Для сложного анализа текстов можно предоставлять выгрузки в формате JSON/CSV.
Предлагаемая схема данных
| Поле | Тип | Описание |
|---|---|---|
id |
UUID / SERIAL | Внутренний идентификатор записи. |
doi |
TEXT | DOI статьи (если есть). |
title |
TEXT | Заголовок статьи. |
abstract |
TEXT | Аннотация (извлечённая из источника). |
fulltext\_txt |
TEXT | Извлечённый полный текст (plain). |
fulltext\_pdf |
TEXT | Путь/URI до PDF-файла в хранилище |
alt\_ids |
JSON/JSONB | Другие идентификаторы: arXiv ID, PMID, PMC ID, HAL ID, Semantic Scholar ID, Scopus ID и т.п. |
source\_url |
TEXT | Путь/URI до исходного файла (LaTeX, DOCX и т.д.). Например, если статья была скачана из arxiv/openAlex, то нужно оставлять публичную ссылку |
authors |
JSON/JSONB | Список авторов: имя, фамилия, ORCID, аффилиация. |
year |
INTEGER | Год публикации. |
source\_db |
TEXT | Откуда извлечена. |
crossref\_metadata |
JSON/JSONB | Просто копия метаданных из crossref для статьи с заданным doi (есть у многих статей), достаётся из датасета crossref Пример возвращаемого json: https://api.crossref.org/works/10.1134/s1064226919120118 |
type |
TEXT | Статья/репорт/статья с конференции |
n\_citations |
NUM | Количество цитирований данной статьи (берется из OpenCitations) |
journal |
TEXT | Название журнала или репозитория. |
volume |
TEXT | Том (если применимо). |
issue |
TEXT | Номер выпуска. |
pages |
TEXT | Номера страниц. |
submission\_date |
DATE | Дата подачи/публикации. |
update\_date |
DATE | Дата последнего обновления метаданных. |
license |
TEXT | Тип лицензии (CC BY, CC BY-NC, авторское право, public domain). |
source |
TEXT | Источник (arXiv, PMC, Sci‑Hub и т.д.). |
oa\_status |
BOOLEAN | Открыт ли доступ (open access). |
keywords |
TEXT[] | Ключевые слова или темы. |
categories |
TEXT[] | Предметные области (например, cs.AI, bio). |
language |
TEXT | Язык оригинала. |
fulltext\_html |
TEXT | HTML представление (если доступно). |
references |
JSON/JSONB | Список ссылок (DOI, заголовки, авторы). |
citation\_count |
INTEGER | Количество цитирований (по данным Crossref/Semantic Scholar). |
version |
INTEGER | Версия записи. |
notes |
JSON/JSONB | Дополнительные комментарии/теги/метаинформация |
Поля от первого до crossref\_metadata включительно - наиболее приоритетные.
Верхнеуровнево алгоритм выглядит как скачивание scihub + скачивание снэпшота OpenAlex + извлечение текста из статей (возможно, слишком дорого) + обогащение скачанных файлов с помощью CrossRef и OpenCitations (в первый раз это можно сделать скачав снэпшот, при последующих апдейтах можно просто запрашивать эту метаинформацию по API).
Отдельно стоит проработать вопрос с добычей тяжёлых данных с помощью РГБ.
2025-12-18
Нам нужно предъявить какой-нибудь скрипт, который по заданному doi
Например,
Вход:
https://doi.org/10.1134/S1064226919120118
Кто цитирует:
Кого цитирует:
REFERENCES
-
V. N. Vapnik, “An overview of statistical learning theory,” IEEE Trans. Neural Networks 10, 988−999 (1999).
-
A. Choromanska, M. Henaff, M. Mathieu, G. Ben Arous, and Y. LeCun, “The loss surfaces of multilayer networks,” in Artificial Intelligence and Statistics (Proc. 18th Int. Conf., AISTATS 2015, San Diego, California, USA, May 9−12, 2015) (AISTATS 2015), pp. 192−204 (2015).
-
K. Kawaguchi, “Deep learning without poor local minima,” in Advances in neural information processing systems (NIPS, 2016), pp. 586−594.
-
C. Zhang, S. Bengio, M. Hardt, B. Recht, and O. Vinyals, “Understanding deep learning requires rethinking generalization,” arXiv, Preprint arXiv:1611.03530 (2016).
-
Laurent Dinh, Razvan Pascanu, Samy Bengio, and Yoshua Bengio, “Sharp minima can generalize for deep nets,” J. Machine Learning Res. (JMLR) 70, 1019−1028 (2017).
-
Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun, “Deep residual learning for image recognition,” in Proc. IEEE Conf. on Computer Vision and Pattern Recognition, Las Vegas, NV, USA, June 27–30,__2016 (IEEE, New York, 2016), pp. 770−778.
-
Y. Le Cun, L. D Jackel, B. Boser, J. S. Denker, H. P. Graf, I. Guyon, D. Henderson, R. E. Howard, and W. Hubbard, “Handwritten digit recognition: Applications of neural network chips and automatic learning,” IEEE Commun. Mag. 27 (11), 41−46 (1989).
-
Ya. Le Cun and C. Cortes, MNIST Handwritten Digit Database (Modified Nat. Inst. of Standards and Technol., 2010).
-
H. Xiao, K. Rasul, and R. Vollgraf, Fashion-mnist: a Novel Image Dataset for Benchmarking Machine Learning Algorithms arXiv Preprint arXiv:1708.07747 (2017).
-
A. Krizhevsky and G. Hinton., “Learning multiple layers of features from tiny images,” Tech. Report, Citeseer (2009).
-
A. Paszke, S. Gross, S. Chintala, G. Chanan, E. Yang, Z. DeVito, Z. Lin, A. Desmaison, L. Antiga, and A. Lerer, “Automatic differentiation in PyTorch,” in NIPS 2017 Workshop on Autodiff, Long Beach, California, USA, Dec. 7,__2017.
-
D. P. Kingma and J. Ba. Adam, “A method for stochastic optimization,” arXiv Preprint arXiv:1412.6980 (2014).
-
H. Robbins and S. Monro, “A stochastic approximation method,” Ann. Math. Statist., 400−407 (1951).
-
X. Glorot and Y. Bengio, “Understanding the difficulty of training deep feedforward neural networks,” in Proc. 13th Int. Conf. on Artificial Intelligence and Statistics, Sardinia, Italy, May 13−15,__2010, (AISTATS, 2010), pp. 249−256.
-
E. D. Sontag, “Vc dimension of neural networks,” NATO ASI Series F Computer and Systems Sci. 168, 69−96 (1998).
Альберту разбанили учетку, но на ней всё пусто, надо получить базовый доступ.
Надо доебаться достучаться до GigaEye!!!
- Перенсём код в тиму на гитхабе новелти чекер, релепепер, scientific deepresearch, datachat
- Альберт нашёл несколько вариантов ui pandas ai
2025-12-19
Демо
- описание доступно под девайсовским ВПН
они пытаются вынуть OCRом из пдфок

- достаточно указать общий путь, чтобы прочитать все паркеты
- можно получить пдфку для киберленинки
архив = t-30, его докачивают
- приме архива
Команда Сережи Волкова занимается прикладным уровнем
Команда поиска - другие ребята
Надо переходить к кастомной быстрой сборке
https://github.com/HocfaiSun/SciHubDownloader
https://github.com/Tishacy/SciDownl
Вот это очень крутой проект, надо его использовать для данных из других источников
💅 Выкладываю Arxiv at Home: Семантический поиск по статьям на своем железе
Стандартный поиск arXiv — это танец с бубном. Semantic Scholar иногда ищет не то, что хочешь. SerpAPI по Google Scholar платный.
Поэтому я за выходной собрал Arxiv at Home — open-source движок для семантического поиска статей, который можно развернуть локально.
По фичам:
-
Гибридный поиск: Retrieval Stage из эмбеддингов и BM25, сверху нейронный реранкинг.
-
Citation Boosting: Формула ранжирования учитывает не только смысл, но и импакт статьи. Сейчас для получения цитат используется бесплатный Batch API Semantic Scholar.
-
Инкрементальные обновления: Умная синхронизация, тянет только новые статьи, не обрабатывая весь датасет заново.
-
Оффлайн-режим: Всё локально, кроме цитат. Цитаты можно отключить в конфиге.
Кстати, сама API-шка stateless и хорошо скейлится горизонтально, а для стораджа используется PostgreSQL и QDrant - по идее, эту штуку можно развернуть примерно где угодно.
Код и инструкция по запуску на GitHub:
🔗 github.com/mrapplexz/arxiv-at-home
обогащаем с помощью
https://www.sci-hub.in/database
https://annas-archive.li/torrents/scihub
2026-02-19Сделал первый прототип
Оценка стоимости аренды железки на cloud.ru
SciBase: План прогрессивного развёртывания на Cloud.ru
Дата: 2026-02-19
Принцип: Парето — 80% ценности при 20% затрат на старте, наращивание постепенно.
Оптимизации стоимости
1. PDF → Ice class S3 (самый дешёвый)
PDF-файлы — write once, read rarely. Ice class на cloud.ru: 0.49 ₽/ГБ/мес (в 3.7× дешевле Standard). Ограничения Ice: дороже операции чтения (0.055 ₽ за 1000 GET vs 0.033 ₽), но для базы научных статей это некритично — читают единичные PDF, а не делают массовые scan.
2. Начинать с маленькой VM, расти по мере данных
С 5M записей в PostgreSQL не нужны 128 GB RAM. 32 GB хватит до ~50M записей. Экономия ~29 000 ₽/мес на старте.
3. Гибридный seeding: Hetzner для торрентов
Самая большая ловушка cloud.ru — цена дисков (~11.4 ₽/ГБ/мес). 4 TB SSD буфер для торрентов = 45 600 ₽/мес только за диск. Hetzner AX52 с 4 TB NVMe = €80 = ~8 000 ₽/мес (диски включены). Скачиваем торренты на Hetzner → заливаем в cloud.ru S3 Ice → удаляем.
4. Приоритизация данных по ценности
Для команды AI4Science в Сбере 80% ценности — это:
- CS, Physics, Math, Bio (arXiv покрывает это почти целиком)
- Свежие статьи (последние 5-10 лет)
- Высокоцитируемые работы
Sci-Hub (88M статей, 100 ТБ) — это длинный хвост. Из него ~20% действительно нужны для AI4Science.
5. BM25 first, семантика потом
BM25 (keyword search) даёт ~70-80% качества поиска и не требует Qdrant/GPU/эмбеддингов. Qdrant с 250M эмбеддингами съест ~500 ГБ NVMe (= 5 700 ₽/мес за диск). Добавляем на Phase 3.
6. Рост S3 пропорционален загрузке
Не платим за 120 ТБ с первого дня. Ice class = pay-as-you-go.
Phase 1: «Рабочий поиск» (Недели 1-4)
Цель: Поиск по 30-50M статей + PDF для arXiv/PMC через OA.
Что загружаем
| Источник | Объём данных | Объём PDF | Время загрузки |
|---|---|---|---|
| OpenAlex metadata (subset: CS, Physics, Math, Bio) | ~80 ГБ → ~30-50M записей в PG | — | 2-3 дня |
| arXiv bulk (последние 5 лет) | метаданные в PG | ~2-3 ТБ PDF | 3-5 дней (S3 requester pays) |
| PMC OA (биомед) | метаданные в PG | ~200-500 ГБ PDF | 3-5 дней (FTP) |
Что работает
POST /search(BM25 по title + abstract) — < 500 мсGET /paper/doi/{doi}— PDF из S3 или Unpaywall fallback (~50% покрытие)GET /stats,/health- MCP для Claude
Инфраструктура
| Компонент | Конфигурация | Цена/мес |
|---|---|---|
| VM (Compute) | 16 vCPU / 32 GB RAM | 17 350 ₽ |
| Диск SSD | 500 ГБ (PG ~200 ГБ + индексы + OS) | 5 700 ₽ |
| S3 Ice | ~3 ТБ (arXiv + PMC PDFs) | 1 470 ₽ |
| Public IP | 1 шт | 146 ₽ |
| Итого | ~24 700 ₽/мес (~250$) |
Ценность: Команда уже может искать статьи. 80% рабочих запросов покрыты.
Phase 2: «Полные метаданные + цитирования» (Месяцы 2-3)
Цель: Вся мировая наука в метаданных (250M), граф цитирований, больше PDF.
Что загружаем
| Источник | Объём | Время |
|---|---|---|
| OpenAlex (полный snapshot) | 330 ГБ compressed → 250M записей | 1 неделя (загрузка + импорт) |
| CrossRef enrichment | ~200 ГБ | 3-5 дней (API) |
| OpenCitations | 39 ГБ zip → 2 млрд связей | 2-3 дня |
| arXiv bulk (полный, все годы) | ~9 ТБ PDF | 1-2 недели |
Что нового
- Поиск по 250M статей (вся мировая наука)
- Citation boost в ранжировании
GET /citations/{doi}— граф цитирований- Покрытие PDF: arXiv полный + PMC + Unpaywall ≈ ~15-20% локально + ~30% OA
Инфраструктура (апгрейд)
| Компонент | Конфигурация | Цена/мес |
|---|---|---|
| VM (Compute) | 32 vCPU / 128 GB RAM (для 250M PG) | 46 600 ₽ |
| Диск SSD | 2 ТБ (PG ~800 ГБ + цитирования + индексы) | 22 800 ₽ |
| S3 Ice | ~12 ТБ (arXiv полный + PMC) | 5 880 ₽ |
| Public IP | 1 шт | 146 ₽ |
| Итого | ~75 400 ₽/мес (~750$) |
Phase 3: «Семантический поиск + начало Sci-Hub» (Месяцы 4-6)
Цель: Поиск по смыслу (embeddings), начать наращивать покрытие PDF через торренты.
Что загружаем
| Источник | Объём | Время |
|---|---|---|
| Эмбеддинги 250M статей (all-MiniLM-L6-v2) | ~400 ГБ в Qdrant | 2-3 недели (CPU) |
| Sci-Hub торренты (приоритет: CS, Physics, Math, Medicine) | ~20-30 ТБ PDF (20-25M статей) | 2-3 месяца фоном |
Что нового
mode: "semantic"иmode: "hybrid"— поиск по смыслу- Cross-encoder reranking
- Покрытие PDF: ~40-50% (локально + OA)
Инфраструктура
| Компонент | Конфигурация | Цена/мес |
|---|---|---|
| VM (Compute) | 32 vCPU / 128 GB RAM | 46 600 ₽ |
| Диск SSD | 3 ТБ (PG + Qdrant ~500 ГБ) | 34 200 ₽ |
| S3 Ice | ~25-35 ТБ (растёт по мере загрузки) | 12 250 - 17 150 ₽ |
| Seed (Hetzner AX52) | 8C/64GB/4TB NVMe — торренты → S3 | ~8 000 ₽ (€80) |
| Public IP | 1 шт | 146 ₽ |
| Итого | ~101 000 - 106 000 ₽/мес (~1 050$) |
Phase 4: «Полное покрытие» (Месяцы 7-12)
Цель: Доскачать Sci-Hub, автообновления, production-ready.
Что загружаем
| Источник | Объём | Время |
|---|---|---|
| Sci-Hub торренты (оставшиеся) | ещё ~60-70 ТБ | 4-6 месяцев фоном |
| Автообновления: arXiv ежедневно, PMC еженедельно, OpenAlex ежемесячно | ~2-5 ГБ/день | непрерывно |
Что нового
- Покрытие PDF: ~80-90%
- Мониторинг (Prometheus + Grafana)
- Автоперезапуск, health-checks
- Production SLA
Инфраструктура
| Компонент | Конфигурация | Цена/мес |
|---|---|---|
| VM (Compute) | 32 vCPU / 128 GB RAM | 46 600 ₽ |
| Диск SSD | 3 ТБ | 34 200 ₽ |
| S3 Ice | 80-120 ТБ | 39 200 - 58 800 ₽ |
| Seed (Hetzner) | до завершения загрузки, потом выключить | 8 000 ₽ → 0 |
| Итого (рост S3) | ~120 000 - 140 000 ₽/мес | |
| После загрузки всего | без Seed, S3 = 120 ТБ | ~140 000 ₽/мес (~1 400$) |
Сводка по бюджету
| Фаза | Период | Стоимость/мес | Кумулятивно | Что имеем |
|---|---|---|---|---|
| 1 | Мес. 1 | ~25 000 ₽ | 25 000 ₽ | BM25 поиск, 50M статей, arXiv PDF |
| 2 | Мес. 2-3 | ~75 000 ₽ | 175 000 ₽ | 250M метаданных, цитирования, 12 ТБ PDF |
| 3 | Мес. 4-6 | ~105 000 ₽ | 490 000 ₽ | Семантический поиск, 35 ТБ PDF |
| 4 | Мес. 7-12 | ~130 000 ₽ | 1 270 000 ₽ | 90%+ покрытие, 100+ ТБ PDF |
| Cruise | Мес. 13+ | ~140 000 ₽ | +140K/мес | Полная база, автообновления |
Суммарно за первый год: ~1.3 млн ₽ (~13 000$)
Источники цен (актуальны на 01.01.2026)
- Cloud.ru Evolution Compute тарифы
- Cloud.ru Object Storage тарифы
- Cloud.ru Object Storage классы хранения
- arXiv Bulk Data S3
- OpenAlex Snapshot
2026-02-23
Текущий статус инфраструктуры: уже запущен торрент SciHub архива, PostgreSQL, FastAPI. Embeddings залиты. Следующий шаг — написать план развертывания и обсудить с Альбертом.
2026-03-29
Пока поставили на паузу, потому что можно кое как парсить сайхаб